ChinaMM 2024 显著性目标检测 RGB-D图像 多模态特征融合 多层次感知

基于多层次感知的RGB-D显著性目标检测网络

王妍1   郑宛露1,2   潘成伟1,2   王少荣1,3*

1北京林业大学信息学院
2北京航空航天大学人工智能学院
3国家林业草原林业智能信息处理工程技术研究中心

TL;DR提出跨模态层次感知网络(CHANet),为不同层级的多模态特征设计差异化融合策略,在四个数据集上相比次优模型实现0.27%~2.9%的性能增益。

Abstract

现有RGB-D显著性检测方法对不同层次不同模态特征采用统一融合策略,忽略了不同层次和不同模态特征的固有优势。本文提出CHANet,针对RGB信息在全局语义上的优势和深度信息在局部结构上的优势,为不同层级设计差异化融合策略,并在解码阶段引入三分支解码器和自适应特征聚合模块。

Method

现有方法对不同层次和模态采用统一融合策略,未能充分利用深度图在细节上和RGB图在语义上的优势。同时,低质量深度特征可能对检测结果产生负面影响。

核心思想是分层差异化融合:低层次利用深度特征的优势增强局部细节,高层次利用深度信息辅助全局语义理解。解码阶段通过三分支解码器和自适应特征聚合模块动态调整多模态特征权重,减少低质量深度噪声的干扰。

LDEM

低层次细节增强模块

在编码器低层阶段,以深度特征为优势特征,通过拼接融合和通道注意力掩码增强多模态共享特征的细节表现,逐层递进累积融合信息。

HSEM

高层次语义增强模块

在编码器高层阶段,通过空间注意力增强深度特征,引导RGB和深度特征关注关键区域,再经通道注意力融合获得区域感知的语义特征。

AFM

自适应特征聚合模块

在三分支解码器的RGB-D共享分支中,通过生成注意力权重图自动校正RGB和Depth解码特征的融合比例,有效避免低质量深度噪声干扰。

Results

NLPR
0.931
S-measure
+0.002 vs CIRNet 最优
NJU2K
0.935
F-measure
+0.008 vs CDINet 最优
DES
0.947
F-measure
+0.004 vs CCAFNet 最优
SIP
0.896
S-measure
+0.010 vs CIRNet 最优
方法NLPR SNLPR FNJU2K SNJU2K FDES SDES F
CIRNet0.9290.9240.9230.9270.9430.933
CDINet0.9270.9160.9190.9280.9370.943
BiANet0.9250.9140.9150.9200.9310.926
CHANet (Ours) ours0.9310.9310.9240.9350.9420.947

在五个基准数据集上,CHANet在绝大多数指标上达到最优或次优性能。相比次优模型,四个数据集上四个指标分别实现了0.27%~1.88%、0.1%~1.12%、0.54%~2.9%、0.2%~1.08%的性能增益。

Qualitative Results

Fig. 7 Comparative Effect of Saliency Detection Between Different Models

Fig. 7 Comparative Effect of Saliency Detection Between Different Models

Takeaway

为不同层级的多模态特征设计差异化融合策略是RGB-D显著性检测的关键。低层次应充分利用深度信息的空间结构优势,高层次则应利用深度信息辅助语义理解,同时通过自适应机制减少低质量深度噪声的影响。

Citation

@inproceedings{wang2024chanet,
  title={基于多层次感知的RGB-D显著性目标检测网络},
  author={王妍 and 郑宛露 and 潘成伟 and 王少荣},
  booktitle={中国多媒体大会(ChinaMM 2024)},
  year={2024}
}